1 Contenido de la clase
Normalización de imágenes y canales espectrales [00:00-02:20]
Cuando se juntan distintas fuentes de información (datos con diferente rango dinámico) hay que normalizar para que todo quede en el mismo rango [00:45-01:05]. Las imágenes pueden tener muchos canales; el caso típico son 4 canales: rojo, verde, azul y pancromático. El pancromático es una imagen de intensidad que junta los tres canales de color [01:12-01:40]. El canal verde es importante por una razón física (relacionada con la sensibilidad de los sensores) [02:00-02:20].
Visión computacional y neurociencia: lentes de Meta [03:05-05:25]
Una alumna presenta una aplicación con lentes de Meta (realidad aumentada) para estimar degeneración cerebral y detectar enfermedades degenerativas [03:05-03:20]. Los lentes tienen sensores multiseñal: audio, video, imágenes y sensores de movimiento [03:25-03:40]. Se recolectan datos de la vida cotidiana (cocinar, comer, movimientos) para correlacionar patrones de comportamiento con la degeneración cerebral [04:30-05:00]. Los datos de Meta son open source (dataset egocéntrico) [07:01-07:12].
Vision Transformers y modelos multimodales [03:40-04:30, 05:00-05:25]
Un Vision Transformer (ViT) adapta el transformer de texto a las imágenes: usa módulos de self-attention para recordar patrones o pedacitos de la imagen, de forma similar a como el transformer recuerda secuencias de texto [03:40-04:05]. No usa la red neuronal convolucional clásica [04:10-04:20]. Los modelos multimodales (como ImageBind de Meta) transforman señales de texto, video, audio e imagen a un espacio vectorial (embeddings), lo que permite que un transformer de texto interprete contenido visual [05:00-05:25].
fMRI, reconstrucción de percepción y biomarcadores digitales [05:25-06:43]
Con fMRI se busca reconstruir lo que la persona está viendo a partir de la actividad cerebral: se mapea la actividad, se transforma la imagen cerebral a embeddings y un modelo de IA generativa de imagen usa esos embeddings para reconstruir la percepción visual [05:25-06:00]. Los biomarcadores digitales son un concepto muy nuevo: métodos menos invasivos (pulsera, microchip) para obtener información cerebral, correlacionando patrones de movimiento diarios con señales cerebrales [06:10-06:43].
Campos receptivos y control de ganancia local [08:55-22:02]
En la retina, los sensores que caen dentro de un área (campo receptivo) se agrupan y la información sale por un nervio [08:55-09:30]. La contribución de cada sensor sigue un perfil gaussiano (el centro pesa más) [10:05-10:20]. Las células bipolares agrupan muestras con perfil gaussiano y las células horizontales realizan un control de ganancia local [11:10-11:40]. En la periferia no se resuelven detalles (solo se "ven cosas"); en el centro de la visión hay alta resolución [12:00-12:30]. La correlación es una función matemática que se correlaciona con un estímulo parecido: el resultado es máximo cuando se parecen [13:15-14:00]. Ejemplo: con fondo brillante, las personas salen oscuras en la foto porque la cámara ajusta a la luminancia promedio, mientras que el ojo tiene control de ganancia local (cada zona ajusta distinto) [15:30-16:30].
Retina, fóvea, bastones y conos [22:13-25:00]
La densidad de sensores en la retina es de ~135-145 mil por milímetro cuadrado (bastones y conos) [22:13-22:30]. El punto ciego es por donde salen los nervios [22:40-22:50]. Los bastones (unos 100 millones) están sobre todo en la periferia, funcionan con poca luz y no dan color [23:00-23:30]. Los conos se concentran en el centro de la visión (fóvea), son pocos, necesitan mucha luz y dan color [23:30-23:50]. La visión escotópica (bastones, poca luz, sin color) contrasta con la visión en color; la periferia es sin color porque solo hay bastones [23:50-24:10]. Experimentos: en un cuarto oscuro, un punto iluminado se ve en la periferia, no en el centro; al mover la vista aparece [24:20-24:40]. En el experimento del punto amarillo, fijando la vista en distintos números de una foto, el punto amarillo nunca se ve directo (solo en periferia) [24:40-25:00].
Estereopsis: profundidad por disparidad binocular [27:22-29:01]
Con dos ojos (o dos cámaras) separados, los objetos cercanos cambian más de posición que los lejanos; la disparidad es proporcional a la proximidad del objeto [27:22-28:00]. El camino del ojo a la corteza cruza nervios en el quiasma óptico, donde se calcula la disparidad [28:10-28:30]. Las etapas profundas del procesamiento visual aún no se entienden por completo; se pasa de estructuras básicas (detección de líneas) a tareas complejas en la corteza [28:40-29:01].
El sistema visual como caja negra: respuesta a impulso [29:07-44:15]
El sistema visual se puede ver como una caja negra: entrada = estímulo, salida = percepción [29:07-29:30]. Se considera el perfil de luminancia de una línea (negro, blanco, transición). La respuesta a impulso es la función que permite conocer la calidad del sistema a partir de la entrada [30:00-30:40]. La operación consiste en multiplicar la función de respuesta por el estímulo e integrar: es una correlación/convolución, y el sistema es lineal; el kernel se desliza una posición a la vez [31:10-32:00]. Este modelo explica fenómenos de contraste: en un borde, el lado oscuro se ve más oscuro y el lado brillante más brillante (bandas de Mach) [33:00-34:00].
Respuesta en frecuencia y MTF [44:45-47:23]
La transformada de la respuesta a impulso es la función de transferencia (transformada de Fourier → frecuencias) [45:25-45:50]. Como al comprar un reproductor de audio se pregunta su respuesta en frecuencia, en visión se estudia cómo percibimos según la frecuencia espacial [46:00-46:30]. Ningún sistema real es plano (impulso ideal); todas las respuestas caen con la frecuencia [46:40-47:00]. La MTF (Modulation Transfer Function) —en óptica, funciones de sensibilidad— describe cómo percibimos cada frecuencia [47:10-47:23].
Función de sensibilidad al contraste y práctica [47:35-60:28]
Se muestra un esquema con renglones de distintas frecuencias espaciales (barras sinusoidales): la percepción del contraste decae con la frecuencia [47:35-48:00]. La MTF del ojo explica qué frecuencias se perciben; la frecuencia máxima de la curva es de ~2-3 ciclos por grado (no ciclos por segundo) [48:10-49:00]. En la clase siguiente se detalla una práctica para medir la curva de sensibilidad al contraste usando los renglones/discos de frecuencias [60:00-60:28].
2 Puntos destacados / Lo que hay que saber
3 Actividades y tareas pendientes
En esta clase no se dejó una tarea con fecha de entrega, pero se adelantó la práctica de la clase siguiente: medir la curva de sensibilidad al contraste usando los renglones/discos de frecuencias (frecuencia máxima ~2-3 ciclos por grado) [60:00-60:28]. Conviene:
4 Dudas que podrían examinar
¿Por qué hay que normalizar las imágenes?
Al juntar fuentes con distinto rango dinámico hay que llevarlas al mismo rango para poder procesarlas juntas [00:45-01:05].
¿Qué diferencia hay entre un Vision Transformer y una CNN?
El ViT adapta el transformer de texto a imágenes con self-attention, sin usar la red convolucional clásica [03:40-04:20].
¿Qué son los biomarcadores digitales?
Métodos menos invasivos (pulsera, microchip) que correlacionan patrones de movimiento diarios con señales cerebrales [06:10-06:43].
¿Por qué la visión periférica es mejor con poca luz?
Porque en la periferia hay bastones (poca luz, sin color); los conos están en el centro y necesitan mucha luz [23:00-24:10].
¿Cómo se calcula la profundidad con dos ojos?
Por disparidad binocular: los objetos cercanos cambian más de posición; el cálculo ocurre en el quiasma óptico [27:22-28:30].
¿Qué es la respuesta a impulso?
Es la función que describe la calidad del sistema a partir de un estímulo; se multiplica por el estímulo y se integra (correlación/convolución) [30:00-32:00].
¿Qué mide la MTF?
La respuesta en frecuencia del sistema (función de transferencia); en visión describe cómo percibimos según la frecuencia espacial [45:25-47:23].
¿Cuál es la frecuencia máxima que percibe el ojo?
La curva de sensibilidad al contraste cae hasta ~2-3 ciclos por grado [48:10-49:00].
5 Sitios o recursos para visitar
Modelo multimodal que une audio, texto, imagen y video en un espacio vectorial. · es.wikipedia.org
Self-attention aplicado a imágenes (alternativa a las CNN). · google.com
Área de la retina cuyos sensores se agrupan y salen por un nervio. · es.wikipedia.org
Neurona de la retina que agrupa muestras con perfil gaussiano. · es.wikipedia.org
Célula de la retina responsable del control de ganancia local. · es.wikipedia.org
Fotorreceptores de la periferia, visión escotópica (poca luz, sin color). · es.wikipedia.org
Fotorreceptores de la fóvea que dan visión en color. · es.wikipedia.org
Centro de la retina con máxima densidad de conos y alta resolución. · es.wikipedia.org
Percepción de profundidad por disparidad binocular. · es.wikipedia.org
Respuesta en frecuencia de un sistema óptico. · es.wikipedia.org
Curva que describe qué frecuencias espaciales percibe el ojo. · google.com
Ilusiones de contraste en los bordes (lado oscuro más oscuro, brillante más brillante). · es.wikipedia.org
6 Glosario de términos
- Normalización: ajustar datos de distinto rango dinámico a un mismo rango.
- Canal pancromático: imagen de intensidad que junta los canales de color (rojo, verde, azul).
- Vision Transformer (ViT): arquitectura que aplica self-attention a las imágenes, adaptando el transformer de texto.
- Modelo multimodal: modelo que transforma distintas señales (texto, video, audio, imagen) a un espacio vectorial común (embeddings).
- Embedding: representación vectorial de una señal en un espacio continuo.
- Biomarcador digital: método no invasivo (pulsera, microchip) que correlaciona patrones de comportamiento con señales cerebrales.
- Campo receptivo: área de la retina cuyos sensores se agrupan y contribuyen a una misma célula.
- Célula bipolar: neurona de la retina que agrupa muestras de los fotorreceptores con perfil gaussiano.
- Célula horizontal: neurona de la retina que realiza control de ganancia local.
- Perfil gaussiano: ponderación donde el centro pesa más que los bordes.
- Correlación / convolución: operación de multiplicar la función de respuesta por el estímulo e integrar.
- Punto ciego: zona de la retina por donde salen los nervios y no hay fotorreceptores.
- Bastón: fotorreceptor de la periferia, sensible a poca luz, sin color (visión escotópica).
- Cono: fotorreceptor de la fóvea, necesita mucha luz, da color.
- Fóvea: centro de la retina con máxima densidad de conos y alta resolución.
- Estereopsis: percepción de profundidad por disparidad binocular.
- Disparidad: diferencia de posición de un objeto entre las dos retinas; es proporcional a la cercanía.
- Respuesta a impulso: función que describe la salida del sistema ante un estímulo puntual.
- Función de transferencia: transformada (Fourier) de la respuesta a impulso; describe la respuesta en frecuencia.
- MTF (Modulation Transfer Function): medida de la respuesta en frecuencia de un sistema óptico.
- Frecuencia espacial: variación del estímulo por unidad de ángulo (ciclos por grado).
- Bandas de Mach: ilusiones de contraste en los bordes (el lado oscuro se ve más oscuro y el brillante más brillante).
7 Mapa mental textual
- Principios de Visión Computacional y Neurociencia
- Procesamiento de imágenes
- Normalización de fuentes con distinto rango dinámico
- Canales: rojo, verde, azul, pancromático (intensidad)
- IA moderna y neurociencia
- Vision Transformers (self-attention, sin CNN)
- Modelos multimodales → embeddings (ImageBind)
- Lentes de Meta: degeneración cerebral (datos open source)
- fMRI → reconstrucción de percepción con IA generativa
- Biomarcadores digitales (pulsera, microchip)
- El sistema visual humano
- Retina y fóvea
- Campos receptivos con perfil gaussiano; células bipolares y horizontales (ganancia local)
- Bastones (periferia, poca luz, sin color) vs conos (fóvea, mucha luz, color)
- Punto ciego; experimentos de percepción periférica
- Estereopsis: disparidad binocular → profundidad (quiasma óptico)
- Sistema como caja negra
- Respuesta a impulso → correlación/convolución (bandas de Mach)
- Función de transferencia (Fourier) → MTF
- Sensibilidad al contraste: frecuencia máxima ~2-3 ciclos por grado
- Retina y fóvea
- Práctica próxima: medir la curva de sensibilidad al contraste [60:00-60:28]
- Procesamiento de imágenes